即時快訊
可溶解微針創新癌症療法 靶向遞送藥物減少副作用 希捷科技 2TB 行動硬碟價格探底 全新裝置比二手更划算 Aura Minerals 獲 2 億美元銀團信貸額度 強化美洲礦業擴張實力 美國汽油每加侖破4.4美元 伊朗戰事推升油價逼近全年新高 丹麥軍援烏克蘭加速 斥俄羅斯「嚴重挑釁」後追加 2.41 億歐元 Neptune Medical內視鏡機器人獲美國FDA核准 望革新大腸鏡檢查 摩根大通、桑坦德集團主導 Drax 太陽能收購案 11 億英鎊融資 印度遊戲新法上路四月零註冊 逾兩百起投訴湧入監管機關 沙烏地輸油管關閉威脅亞洲經濟穩定 油價飆漲增通膨壓力 美ETF市場資產衝破16兆美元 專家警示新產品「更像賭博」
Google Gemini 3.8模型邊思考邊輸出 強化AI決策透明度
科技生活

·a few seconds ago·責任編輯
#Google#Gemini#AI#語音助理#透明度
Google Gemini 3.8模型邊思考邊輸出 強化AI決策透明度
商傳媒|責任編輯/綜合外電報導
摘要

Google 近期推出 Gemini 3.8 Live Extended Thinking AI 模型,最大亮點是「邊思考邊輸出」的語音解釋能力,讓 AI 能即時說明決策過程,大幅提升使用者信任度,雖然在語音處理和自動化任務上表現突出,但程式開發能力仍落後競爭對手。

Google 近日發布了其最新的人工智慧模型 Gemini 3.8 Live 及 Gemini 3.8 Live Extended Thinking,兩者都具有即時語音處理能力,其中「Extended Thinking」技術的應用,讓 AI 模型能邊思考邊輸出,即時揭露其決策過程,試圖提升使用者對 AI 的信任度。

根據《Forkast》報導,Gemini 3.8 Live Extended Thinking 模型在今年九月推出,其核心在於讓 AI 在處理複雜任務時,能以語音方式闡述其思考路徑,例如在背景執行任務時,會先發出「讓我確認一下」等提示。這種視覺化推論(visible inference)的機制,有助於使用者主動監控 AI 的邏輯判斷,並在 AI 產生誤差或誤解指令時及時介入,解決過去 AI 「黑盒子」問題,對於企業導入 AI 應用至關重要。

Gemini 3.8 Live Extended Thinking 在效能方面表現亮眼。《Memeburn》指出,該模型在「Artificial Analysis Speech-to-Speech Quality Index」語音品質指標上獲得 82.6 分,並在「Big Bench Audio」音訊推理測試中達到 97.7% 的成績,於 τ-Voice 的自動化任務(agentic task completion)完成率也達到 68.6%,顯示其在語音處理及自動執行複雜任務方面的優勢。此外,Gemini 模型支援 97 種語言並能無縫切換,且是唯一能原生處理影音內容的業界主流模型。

然而,Google 在其他領域仍面臨競爭。獨立評測顯示,Anthropic 的 Claude Sonnet 4.6 在程式開發評估基準 SWE-bench Verified 上達到 82.1%,大幅領先 Google 舊版 Gemini 3.1 Pro 的 63.8%。雖然 Google 並未公布 Gemini 3.8 系列在程式開發方面的數據,但分析認為 Claude 仍是軟體工程師的首選。在性價比方面,OpenAI 的 GPT-5.6 則被認為表現最佳。

Gemini 3.8 Live 的音訊輸入費用為每分鐘 0.005 美元,音訊輸出則為每分鐘 0.018 美元。Gemini 3.8 Live Extended Thinking 模型已透過 Gemini Live API、Google AI Studio 提供給開發者使用,並整合至 Gmail、Google 文件、Google Keep 等消費性產品中。為確保內容真實性,所有經模型生成的音訊都會嵌入肉眼不可見的 SynthID 浮水印,以防範資訊誤導。包括 Salesforce、Genspark 和 Lumeris 等企業夥伴,以及 Agora、Fishjam、LiveKit、LangChain、Pipecat、Vercel 和 Vision Agents 等開發者生態系,都正在利用 Gemini Live API 打造客製化的語音代理(voice agent)。